메뉴

#GPU 컴퓨팅

HN
Hacker News • 16일 전
IMP 7

998달러로 3.8B LLM 학습시켜 CORE 0.384 달성

한 개발자가 야간 작업으로 little-lm이라는 3.8B 파라미터 모델을 처음부터 직접 학습시켜, 렌털 B200 GPU 8대로 43시간, 998달러 비용만으로 CORE 벤치마크 0.384를 달성했다. 이는 비슷한 비용의 nanochat d32(0.310)를 크게 앞서는 결과로, 거액의 컴퓨팅 예산 없이도 개인이 유의미한 모델을 학습할 수 있음을 보여준다. 좋은 인프라와 YAML 기반 실험 관리, Muon 옵티마이저 등의 선택이 핵심이었다.

[object Object] [object Object] [object Object]
MP
MarkTechPost • 120일 전
IMP 8

다중 GPU/노드 통신 융합 커널 라이브러리 mKernel 공개

UC Berkeley의 UCCL 연구팀이 다중 GPU 및 다중 노드 환경의 통신과 연산을 하나의 지속형 CUDA 커널로 통합한 'mKernel' 라이브러리를 공개했습니다. 이 라이브러리는 노드 내 NVLink, 노드 간 RDMA 통신 및 고밀도 연산을 하나로 융합하여 시스템 오버헤드를 최소화하고 대규모 AI 모델 학습 및 분산 컴퓨팅의 효율성을 극대화하는 데 기여할 수 있습니다.

GPU 컴퓨팅 병렬 처리 분산 시스템